library assistant
Democratizing machine learning: perspective from scikit-learn
Scaling Algorithmic improvement is top priority External infrastructure helps scaling out Tension with our mission of generic, reusable library work on impedence matching layer 33. 3 Bridging to data engineering 34. 3 Data assembly for statistics "Dirty data" is a central problem Merging data sources Input errors 35. 3 Machine learning versus data in the wild numbers (in arrays) arrays (of numbers) arrays strings databases schemas A gap between statistics & data engineering 36.